Search CORE

5 research outputs found

Modelling Instance-Level Annotator Reliability for Natural Language Labelling Tasks

Author: Ananiadou Sophia
Li Maolin
Mu Tingting
Myrman Arvid Fahlström
Publication venue
Publication date: 01/01/2019
Field of study

When constructing models that learn from noisy labels produced by multiple annotators, it is important to accurately estimate the reliability of annotators. Annotators may provide labels of inconsistent quality due to their varying expertise and reliability in a domain. Previous studies have mostly focused on estimating each annotator's overall reliability on the entire annotation task. However, in practice, the reliability of an annotator may depend on each specific instance. Only a limited number of studies have investigated modelling per-instance reliability and these only considered binary labels. In this paper, we propose an unsupervised model which can handle both binary and multi-class labels. It can automatically estimate the per-instance reliability of each annotator and the correct label for each instance. We specify our model as a probabilistic model which incorporates neural networks to model the dependency between latent variables and instances. For evaluation, the proposed method is applied to both synthetic and real data, including two labelling tasks: text classification and textual entailment. Experimental results demonstrate our novel method can not only accurately estimate the reliability of annotators across different instances, but also achieve superior performance in predicting the correct labels and detecting the least reliable annotators compared to state-of-the-art baselines.Comment: 9 pages, 1 figures, 10 tables, 2019 Annual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL2019

arXiv.org e-Print Archive

Crossref

The University of Manchester - Institutional Repository

Optimering av en Yatzytur genom utvärdering av alla inom turen nåbara tillstånd

Author: Fahlström Myrman Arvid
Publication venue: KTH, Skolan för datavetenskap och kommunikation (CSC)
Publication date: 01/01/2014
Field of study

I denna rapport beskrivs en metod för att kunna optimera den förväntade resultatet från en tur under en omgång av Yatzy. Yatzy är ett klassiskt tärningsspel som kan spelas ensam eller med flera spelare. Det finns sedan tidigare en matematiskt optimal strategi för hur man bäst bör gå tillväga för att optimera det förväntade slutresultatet från en omgång Yatzy, först beskriven av James Glenn för amerikanska regler och sedan applicerad på svenska regler av Markus Larsson och Andreas Sjöberg, som bygger på att bygga upp en graf över alla möjliga tillstånd under spelets gång. I denna rapport beskrivs en mer begränsad version av denna metod,som endast bygger upp en graf över de möjliga tillstånden för den nuvarande turen, med syfte att minska beräkningstid och minnesåtgång för att lagra grafen.Metoden har visat sig vara tillräckligt snabb för användning i begränsade miljöer såsom mobila plattformar, och den genomsnittliga slutpoängen efter ett färdigt spel har efter 10 000 simuleringar beräknats som ungefär 198,6 poäng, runt 50 poäng sämre än Larsson och Sjöbergs metod, och 175 poäng sämre än den högsta möjliga slutpoängen 374. Den är även 12 poäng sämre än en heuristisk beskriven av Nils Dahlbom Norgren och Philip Svensson, men metoden som beskrivs i denna rapport har fördelen att beslutsfattningsstrategierna är enklare att modifiera

Publikationer från KTH

Ökad talarinvarians i obevakad talinlärning genom partitionering av probabilistiska modeller med hjälp av linjära siamesiska nätverk

Author: Fahlström Myrman Arvid
Publication venue: KTH, Tal, musik och hörsel, TMH
Publication date: 01/01/2017
Field of study

Unsupervised learning of speech is concerned with automatically finding patterns such as words or speech sounds, without supervision in the form of orthographical transcriptions or a priori knowledge of the language. However, a fundamental problem is that unsupervised speech learning methods tend to discover highly speaker-specific and context-dependent representations of speech. We propose a method for improving the quality of posteriorgrams generated from an unsupervised model through partitioning of the latent classes discovered by the model. We do this by training a sparse siamese model to find a linear transformation of input posteriorgrams, extracted from the unsupervised model, to lower-dimensional posteriorgrams. The siamese model makes use of same-category and different-category speech fragment pairs obtained through unsupervised term discovery. After training, the model is converted into an exact partitioning of the posteriorgrams. We evaluate the model on the minimal-pair ABX task in the context of the Zero Resource Speech Challenge. We are able to demonstrate that our method significantly reduces the dimensionality of standard Gaussian mixture model posteriorgrams, while also making them more speaker invariant. This suggests that the model may be viable as a general post-processing step to improve probabilistic acoustic features obtained by unsupervised learning.Obevakad inlärning av tal innebär att automatiskt hitta mönster i tal, t ex ord eller talljud, utan bevakning i form av ortografiska transkriptioner eller tidigare kunskap om språket. Ett grundläggande problem är dock att obevakad talinlärning tenderar att hitta väldigt talar- och kontextspecifika representationer av tal. Vi föreslår en metod för att förbättra kvaliteten av posteriorgram genererade med en obevakad modell, genom att partitionera de latenta klasserna funna av modellen. Vi gör detta genom att träna en gles siamesisk modell för att hitta en linjär transformering av de givna posteriorgrammen, extraherade från den obevakade modellen, till lågdimensionella posteriorgram. Den siamesiska modellen använder sig av talfragmentpar funna med obevakad ordupptäckning, där varje par består av fragment som antingen tillhör samma eller olika klasser. Den färdigtränade modellen görs sedan om till en exakt partitionering av posteriorgrammen. Vi följer Zero Resource Speech Challenge, och evaluerar modellen med hjälp av minimala ordpar-ABX-uppgiften. Vi demonstrerar att vår metod avsevärt minskar posteriorgrammens dimensionalitet, samtidigt som posteriorgrammen blir mer talarinvarianta. Detta antyder att modellen kan vara användbar som ett generellt extra steg för att förbättra probabilistiska akustiska särdrag från obevakade modeller

Publikationer från KTH

Digitala Vetenskapliga Arkivet - Academic Archive On-line

Partitioning of Posteriorgrams using Siamese Models for Unsupervised Acoustic Modelling

Author: Fahlström Myrman Arvid
Salvi Giampiero
Publication venue: 'International Speech Communication Association'
Publication date: 01/01/2017
Field of study

QC 20170809</p

Publikationer från KTH

Digitala Vetenskapliga Arkivet - Academic Archive On-line

Modelling Instance-Level Annotator Reliability for Natural Language Labelling Tasks

Author: Ananiadou Sophia
Fahlström Myrman Arvid
Li Maolin
Mu Tingting
Publication venue
Publication date: 01/06/2019
Field of study

The University of Manchester - Institutional Repository